大型語言模型
a minute ago

#大型語言模型
#視覺幻覺
#AI倫理
#電腦視覺
#學術研究
商傳媒|林昭衡/綜合外電報導
摘要

學術界警告,ChatGPT 和 Claude 等多模態大型語言模型(LLMs)在處理圖像時,會產生「視覺幻覺」,即生成看似合理卻不真實的內容,這對自動駕駛、盲人輔助等 AI 應用構成可靠性挑戰,促使研究人員開發如「REVERSE 框架」等新的驗證與預防技術。

隨著人工智慧技術快速發展,OpenAI 的 ChatGPT 和 Anthropic 的 Claude 等大型語言模型(LLMs)已進化為多模態 AI,不僅能處理文字,還能分析圖像,甚至從文字描述生成圖片。然而,學術界對此一進步也提出擔憂,指出這些模型存在「視覺幻覺」(Visual Hallucinations)問題,即 AI 在圖像處理過程中可能生成看似合理但實際錯誤或荒謬的輸出。

根據知名學術期刊《Communications of the ACM》的報導,諾丁漢大學(University of Nottingham)電腦視覺副教授 Michael Pound 指出,LLMs 經過大量文本與影像資料訓練,由於缺乏對「真理」的明確規範,其輸出往往僅具統計學上的合理性,而非真實。加州柏克萊人工智慧研究實驗室(University of California Berkeley Artificial Intelligence Research lab, BAIR)的博士後研究員 David Chan 也提到,儘管人類也會有類似錯誤,但大眾期望 AI 模型的表現應優於人類。

「視覺幻覺」對自動駕駛車與安全監控影像分析等關鍵應用領域構成嚴重挑戰,可能損害大眾對 AI 的信任度。例如,當背景資訊與圖像內容矛盾時,幻覺現象會更頻繁。Michael Pound 舉例說明,醫學影像分析若受其他病患資料影響,AI 可能因此忽略圖像中實際存在的疾病跡象。他強調,對於盲人輔助科技等使用者無法自行驗證輸出的情境,AI 模型的精確度至關重要,任何錯誤都可能帶來風險。

研究人員正積極探討視覺幻覺的根本成因,認為這與生成式 AI 模型作為仰賴機率的「預測引擎」本質息息相關。目前,除了針對特定任務的影像資料進行模型微調(fine-tuning),並在如自動駕駛車中導入光達(LiDAR)等多餘感測器以彌補錯誤外,現有的後驗證(post-hoc verification)方法也面臨效率低落的問題,因為它需要額外的 AI 模型來檢查輸出,過程緩慢且僅能拒絕錯誤回應,無法直接修正。

為提升驗證效率,新的「REVERSE 框架」被提出,它能在 AI 生成回應的過程中同步檢查幻覺。此框架透過訓練模型將詞語分類為「自信」或「不自信」,並在生成影像描述時給予每個詞彙信心評分,從而實現即時修正。David Chan 形容這是一種「推論技巧」,能讓部署中的系統根據預期的錯誤率來進行應對。未來研究則將聚焦於從源頭防止 AI 模型產生幻覺,並探索視覺推理(visual reasoning)而非純文本推理,透過讓模型分析圖像的幾何與外觀,來提高其精準度、理解基礎及可解釋性。